メタの最初のリアルタイム音声認識モデル登場:20人以上が同時に話してもトラックごとに変換可能 毎千分間3ドル
メタは、初めてのリアルタイム音声認識モデル「Muse Voice Transcribe」をリリースしました。このモデルはModel APIから呼び出すことができ、料金は1000分あたり3ドル(約1時間あたり0.18ドル)です。このモデルはストリーミング音声認識、スピーカー分離およびエンドポイント検出を統合しており、音声を即座に変換することができ、全体の音声を待つ必要がありません。また、20人以上のスピーカーを自動的に区別し、トラックごとに出力することができます。